数据不能上云、云端 API 月费越来越高、断网就彻底瘫痪——越来越多的企业和开发者开始考虑私有化部署本地大模型。但问题来了:用什么样的设备跑?普通电脑跑不动,服务器太贵太吵,云端又不放心。
私有化部署本地大模型,核心是找到一台 算力够用、内存充足、功耗可控、数据不出设备 的 AI 迷你主机。它既不能像 GPU 服务器那样动辄几万块、几百瓦,也不能像普通办公电脑那样跑个 7B 模型都卡顿。
帮你搞清楚 私有化部署本地大模型需要什么样的 AI 迷你主机,以及如何根据模型规模、使用场景、预算选择最合适的配置。
私有化部署的核心价值,是解决云端 AI 的三个硬伤:
| 痛点 | 云端 AI | 私有化部署 |
|---|---|---|
| 数据隐私 | 数据上传云端,存在泄露风险 | 数据不出设备,完全可控 |
| 持续成本 | 按 Token 计费,越用越贵 | 一次性硬件投入,无后续费用 |
| 网络依赖 | 断网即瘫痪 | 完全离线可用 |
| 合规要求 | 部分行业禁止数据出境 | 满足等保、信创等合规要求 |
对于金融、医疗、法律、政企等数据敏感行业,私有化部署不是“可选项”,而是“必选项”。
大模型推理需要把模型文件加载到内存中,内存不够,模型根本加载不了。
| 模型规模 | 量化方式 | 文件大小 | 最低内存 | 推荐内存 |
|---|---|---|---|---|
| 7B | Q4 | ~4.5GB | 8GB | 16GB |
| 13B | Q4 | ~7.5GB | 16GB | 32GB |
| 30B | Q4 | ~16GB | 32GB | 64GB |
| 70B | Q4 | ~36GB | 64GB | 128GB |
核心原则:内存决定“能不能跑”,算力决定“跑多快”。选型时先确认内存是否满足目标模型需求。
算力来源主要有三种,对应不同的推理速度:
| 算力来源 | 代表型号 | 7B 模型速度 | 功耗 | 适合场景 |
|---|---|---|---|---|
| 高性能核显 | PB1202(Radeon 660M) | 8~12 token/s | 45W | 预算有限,入门私有化 |
| NPU 加速 | PB1301(50 TOPS) | 15~25 token/s | 28W | 追求能效比,桌面部署 |
| 独立显卡 | PB1401(RTX 3060) | 40~60 token/s | 45W | 高频使用,CUDA 生态 |
| ARM+NPU | PB0601/PB0801(6 TOPS) | 8~12 token/s | 10W | 边缘部署,超低功耗 |
| 存储容量 | 可存模型数 | 说明 |
|---|---|---|
| 128GB | 3~5 个 7B 模型 | 边缘盒子标配 |
| 512GB | 10+ 个模型 | x86 迷你主机主流配置 |
| 1TB+ | 20+ 个模型 | 适合多模型切换场景 |
被动散热(无风扇) :适合低功耗(<15W)设备,零噪音、防尘
主动散热(风扇) :适合高性能设备,持续负载不降频
首次使用是否需要联网激活?→ 必须不需要
模型加载是否需要联网下载?→ 必须预装
拔掉网线后推理是否正常?→ 必须正常
需求:员工通过内网提问,AI 从公司文档中检索答案,数据不出内网。
推荐配置:16GB 内存 + 6~50 TOPS NPU
推荐型号:
| 型号 | 配置 | 7B 速度 | 功耗 | 参考价格 |
|---|---|---|---|---|
| PB1001 | R5-3501U + 16GB DDR4(可升级) | 6~10 token/s | 15W | ¥1,680 |
| PB1202 | R5-6600H + 16GB LPDDR5 | 8~12 token/s | 45W | ¥2,600 |
| PB1301 | Ryzen AI 7 350 + 16GB LPDDR5x + 50 TOPS NPU | 15~25 token/s | 28W | 详询 |
选型建议:
预算有限选 PB1001(可后期升级内存)
追求流畅体验选 PB1301(NPU 加速,功耗低)
需要兼顾办公和游戏选 PB1202
需求:数据不能出政务内网,设备不能连外网,要求国产芯片 + 国产 OS。
推荐配置:6 TOPS NPU + 6GB 内存 + 国产 OS
推荐型号:
| 型号 | 芯片 | NPU | 内存 | 功耗 | 参考价格 |
|---|---|---|---|---|---|
| PB0601 | RK3576(国产) | 6 TOPS | 6GB LPDDR4 | 10W | ¥1,750 |
| PB0801 | RK3588(国产) | 6 TOPS(三核) | 6GB LPDDR4 | 10W | ¥1,950 |
选型建议:
单路推理 / 批量部署选 PB0601
多路并发 / 复杂模型选 PB0801(三核 NPU)
需求:开发者本地调试模型、跑 13B 模型、需要 CUDA 生态。
推荐配置:32GB 内存 + 独立显卡(CUDA)
推荐型号:
| 型号 | 配置 | 13B 速度 | 功耗 | 参考价格 |
|---|---|---|---|---|
| PB1401 | i9-13900H + RTX 3060 12GB + 16GB(可升级) | 25~40 token/s | 45W | 详询 |
| PB1501 | Ryzen AI Max 395 + 128GB + 50 TOPS NPU | 15~22 token/s | 55~120W | 详询 |
选型建议:
需要 CUDA / AI 绘图 / 游戏 → PB1401
需要 70B 大模型 / 8K 剪辑 → PB1501
| 型号 | 内存 | 算力来源 | 7B 速度 | 13B 速度 | 70B | 功耗 | 适合场景 |
|---|---|---|---|---|---|---|---|
| PB1001 | 16GB DDR4(可升级) | Vega 8 核显 | 6~10 token/s | 5~7 token/s | ❌ | 15W | 入门私有化 |
| PB1202 | 16GB LPDDR5 | Radeon 660M | 8~12 token/s | 6~9 token/s | ❌ | 45W | 办公 + AI |
| PB1301 | 16GB LPDDR5x | 50 TOPS NPU | 15~25 token/s | 8~15 token/s | ❌ | 28W | NPU 加速 |
| PB1401 | 16GB DDR4(可升级) | RTX 3060 | 40~60 token/s | 25~40 token/s | ❌ | 45W | CUDA 开发 |
| PB1501 | 128GB LPDDR5x | 50 TOPS NPU | 25~35 token/s | 15~22 token/s | ✅ | 55~120W | 70B 大模型 |
| PB0601 | 6GB LPDDR4 | 6 TOPS NPU | 8~12 token/s | ⚠️ | ❌ | 10W | 政企信创 |
| PB0801 | 6GB LPDDR4 | 6 TOPS(三核) | 8~12 token/s | ⚠️ | ❌ | 10W | 边缘多路 |
| 对比 | 云端 API | 私有化部署 |
|---|---|---|
| 初始成本 | 低(按量付费) | 中(硬件投入) |
| 长期成本 | 持续增长 | 一次性投入 |
| 数据隐私 | 数据上传 | 数据不出设备 |
| 断网可用 | ❌ | ✅ |
| 适用场景 | 非敏感业务 | 政企、金融、医疗 |
长期高频使用,私有化部署更划算;低频临时使用,云端 API 更灵活。
7B 模型:16GB 内存 + 6~50 TOPS 算力,PB1001/PB1202/PB1301 均可
13B 模型:32GB 内存 + 20~50 TOPS 算力,建议 PB1401 或 PB1501
可以。政企内网环境可通过 U 盘或内网文件服务器导入新模型。
可以。华一精品支持AI迷你主机出厂预装:
操作系统(Ubuntu / 统信 UOS / 麒麟 OS)
NPU 驱动 + 推理框架(Ollama / RKNN)
指定模型(Qwen / Llama / ChatGLM)
客户自有软件
开机即用,无需现场部署。